
先说结果
参考图给 AI 视觉锚点,ControlNet 给 AI 结构骨架,IP-Adapter+ControlNet+固定种子,角色瞳距偏差<1.2像素。精准控制从入门到专业三级工作流。
AI绘画进阶:用参考图和ControlNet精准控制构图姿态
纯文字提示词有个天花板:你能描述画面内容,但控制不了精确的构图和姿态。你想让人物摆出特定姿势、物体放在特定位置、画面有特定的空间层次——纯文字做不到。
这时候就需要参考图和 ControlNet。参考图给 AI 一个视觉锚点,ControlNet 给 AI 一个结构骨架。两者结合,AI 绘画从"随机生成"变成"精准创作"。
今天讲参考图和 ControlNet 的完整用法,从入门到进阶。

参考图的四种用法
参考图是 AI 绘画最基础也最强大的控制手段。不同工具的参考图功能略有不同,但核心用法有四种:
用法一:风格参考
上传一张风格参考图,AI 会提取画面的艺术风格(色彩、笔触、质感),应用到新生成的图中。Midjourney V7 的"风格参考图"功能、即梦的"风格联想"都是这个用法。适合做品牌视觉系列内容,保持多张图风格统一。
用法二:角色参考
上传一张角色图,AI 会保留角色的外貌特征,生成同角色的新画面。即梦的"自定义保留人物或主体形象特征"、Midjourney 的 Omni Reference、SD 的 IP-Adapter 都是这个用法。这是做角色一致性的基础。
用法三:构图参考
上传一张构图参考图,AI 会参考画面的构图布局(主体位置、空间层次、视觉引导线),但替换内容。适合你已经想好画面布局,只想换内容的情况。
用法四:图生图(Image-to-Image)
上传一张图作为基础,AI 在保留整体结构的前提下重新绘制。可以调整相似度参数——相似度高就是"微调",相似度低就是"重绘"。即梦的图生图、Midjourney 的 Blend、SD 的 img2img 都是这个用法。
即梦AI的参考图实战

即梦的参考图功能对新手最友好,不需要安装任何插件:
操作步骤:
1. 打开即梦,点加号进入图片生成模式
2. 上传参考图(可以是照片、插画、AI生成的图)
3. 选择图片模型(推荐 5.0 模式,效果最稳定)
4. 输入提示词,描述你想要的变化
5. 生成,根据结果调整提示词或参考强度
即梦参考图的典型玩法:
• 照片转动漫:上传真人照片,提示词写"把这张照片变成宫崎骏动漫风格,保留人物外貌特征",即梦会保留人物和构图,只改变风格。
• 背景替换:上传人物照片,提示词写"保留人物,把背景换成赛博朋克城市夜景,霓虹灯光"。
• 姿势保持:上传一张姿势参考图,提示词写"保持人物姿势,把人物换成穿汉服的少女,背景换成桃花林"。
• 风格统一:上传一张风格参考图,生成多张同风格的系列插画。
ControlNet:给AI一个结构骨架
如果说参考图是给 AI 看"大概长什么样",ControlNet 就是给 AI 看"精确的结构是什么"。它就像给天马行空的画家配了一位严谨的美术指导。
ControlNet 是 Stable Diffusion 的扩展插件,通过提取参考图的结构信息(姿态、轮廓、深度、线条),精确控制生成图的构图和姿态。
常用的 ControlNet 控制类型:
• OpenPose:提取参考图的人体姿态骨架,生成同样姿态的新角色。最常用的控制类型,适合人物绘画。
• Canny / Lineart:提取参考图的边缘线条,生成同样轮廓的新图。适合控制物体形状和构图。
• Depth:提取参考图的深度信息,控制画面的空间层次和远近关系。适合场景绘画。
• Reference:参考原图的角色特征和风格,保持一致性。适合角色多视角生成。
ControlNet实战:精确控制人物姿态

用 OpenPose 控制人物姿态是最常见的 ControlNet 用法:
步骤一:准备姿态参考图
找一张你想要的人物姿态的照片(可以是自己拍的、网上找的),或者用 OpenPose 编辑器手动摆一个骨架。姿态越清晰,控制越精准。
步骤二:提取姿态骨架
在 ComfyUI 或 SD WebUI 中启用 ControlNet,选择 OpenPose 预处理器,上传参考图,自动提取人体骨架(关键点连线:头、肩、肘、腕、髋、膝、踝)。
步骤三:写提示词生成
输入你想要的角色描述提示词("穿红色连衣裙的女人,黑色长发"),ControlNet 会强制生成的人物保持参考图的姿态,但外貌、服装、场景由提示词控制。
步骤四:调整控制强度
ControlNet 权重决定姿态控制的强度。权重太高画面僵硬,权重太低控制不住。一般从 0.7 开始试,根据结果调整。
进阶:多 ControlNet 叠加
可以同时启用多个 ControlNet 单元——OpenPose 控制姿态 + Depth 控制空间深度 + Reference 控制角色身份。三个控制叠加,生成的图在姿态、构图、角色三个维度都精准可控。这就是 SD3+ComfyUI 角色一致性最强的原因。
IP-Adapter:控制角色身份
ControlNet 控制的是"结构"(姿态、构图),但不控制"是谁"。要控制角色身份(同一个人出现在不同画面),需要 IP-Adapter。
IP-Adapter 的原理:提取参考图中角色的面部和外貌特征,作为"身份向量"注入生成过程。生成的新图会保持角色的五官、发型、体型特征,但姿态和场景可以自由变化。
IP-Adapter + ControlNet 组合:这是角色一致性的黄金组合——IP-Adapter 控制"是谁",ControlNet 控制"什么姿态"。固定 Seed(随机种子)后,三次生成的角色瞳距偏差不超过 1.2 像素,达到商业插画可用阈值。
注意:当参考图质量不足(如侧脸遮挡超过 40%)时,面部重建可能出现问题。建议准备正面、侧面、仰视多角度参考图,确保身份提取准确。
不想折腾SD?即梦也能做精准控制

ControlNet 和 IP-Adapter 虽然强大,但需要部署 SD、学习 ComfyUI,门槛不低。如果你不想折腾,即梦也提供了简化版的精准控制:
姿势保持:上传参考图,提示词写"保持人物姿势",即梦会保留参考图的人物姿态,替换其他元素。效果不如 OpenPose 精准,但够用。
智能画布:即梦的「无限画布」支持在画布上直接对图片进行图层级操作——扩图(向外扩展画面)、重绘(局部重新绘制)、消除(去掉不需要的元素)、拼接(多张图合成)。这些操作本质上就是可视化的 ControlNet。
局部重绘:选中画面的某个区域,只重新绘制该区域,其他部分保持不变。适合修改细节(换衣服、改表情、加道具),不需要整图重生成。
对于 80% 的日常创作需求,即梦的参考图+智能画布已经足够。只有需要极致精准控制(商业插画、角色系列)时,才需要上 SD+ControlNet。
精准控制的工作流
总结一下,从简单到复杂的精准控制工作流:
入门级(即梦):文字提示词 → 加参考图(风格/角色/构图)→ 智能画布局部调整。适合日常创作、社交媒体、电商设计。
进阶级(即梦+Midjourney):即梦出草图 → Midjourney 风格参考提升品质 → 即梦智能画布精修。适合追求品质的创作者。
专业级(SD+ComfyUI):准备多角度参考图 → IP-Adapter 锁定角色 → ControlNet 控制姿态/构图 → 固定 Seed 生成系列。适合商业插画、角色 IP、精准设计。
根据你的需求选择合适的层级,不要一上来就折腾 SD,也不要止步于纯文字提示词。找到适合自己的控制粒度,才是最高效的。
下一篇我们讲电商主图与营销海报的 AI 绘画实战工作流。
作者声明:本作品含 AI 生成内容